08 - 内容护栏:拦不住的那一类
本篇回答:怎么防止模型被诱导说出违规内容、产出违规产物;以及为什么这件事和前两篇的性质完全不同。
会用到的词:
- 越狱(jailbreak):诱导模型输出它被训练成不该输出的内容。注意它和提示注入不是一回事 —— 注入是让模型执行不该执行的操作,越狱是让模型说不该说的话
- 精确率 / 召回率:拦截时有多少是拦对的(precision)、该拦的里拦住了多少(recall)。这两个数在护栏里永远互相拉扯
- 误杀(false positive):正常内容被拦。这是护栏最主要的成本,而且成本落在正常用户身上
- TTFT:首个 token 送达用户的时间。流式护栏的取舍全部围绕这个指标